期刊
  出版年
  关键词
结果中检索 Open Search
Please wait a minute...
选择: 显示/隐藏图片
1. 领域本体驱动的招投标网页解析方法
马冬雪, 宋设, 谢振平, 刘渊
计算机应用    2020, 40 (6): 1574-1579.   DOI: 10.11772/j.issn.1001-9081.2019101792
摘要422)      PDF (3054KB)(517)    收藏

针对正则表达式解析招投标网页效率低下的问题,提出了一种基于招投标领域本体的网页自动化解析新方法。首先,分析了招投标网页文本的结构特征;其次,构建了招投标本体的轻量级领域知识模型;最后,给出一种招投标网页元素语义匹配与抽取算法,实现招投标网页的自动化解析。实验结果表明,新方法通过自适应的解析,准确率、召回率分别可达到95.33%、88.29%,与正则表达式方法相比,分别提高了3.98个百分点和3.81个百分点。所提方法可实现自适应地对招投标网页中语义信息的结构化解析抽取,能够较好地满足实用性能要求。

参考文献 | 相关文章 | 多维度评价
2. 用于重复充电运营记录的基于块采样的高效聚集查询算法
潘鸣宇, 张禄, 龙国标, 李香龙, 马冬雪, 徐亮
计算机应用    2018, 38 (6): 1596-1600.   DOI: 10.11772/j.issn.1001-9081.2017112632
摘要377)      PDF (982KB)(310)    收藏
现有查询分析方法通常将实体识别作为线下预处理过程清洗整个数据集,然而,随着数据规模的不断增大,这种高计算复杂性的线下清洗模式已经很难满足实时性分析应用的需求。针对重复充电运营记录上的聚集查询问题,提出一种将近似聚集查询处理与实体识别相结合的方法。首先,通过基于块的采样策略采集样本;然后,在采集到的样本上利用实体识别方法识别出重复的实体;最后,根据实体识别的结果重构得到聚集结果的无偏估计。所提方法避免了识别全部实体的时间代价,通过识别少量样本数据即可返回满足用户需求的查询结果。真实数据集和合成数据集上的实验结果验证了所提方法的高效性和可靠性。
参考文献 | 相关文章 | 多维度评价